메뉴

#온디바이스 AI

TC
TechCrunch AI • 1일 전
IMP 6

프리즘ML, 퀄컴 스마트 글래스에 초경량 LLM 탑재

칼텍 연구진이 창업하고 UC 버클리의 이온 스토이카가 자문하는 AI 랩 프리즘ML(PrismML)이 퀄컴 스냅드래곤 AR1 Gen 1 플랫폼 기반 AI 스마트 글래스에서 로컬 구동 가능한 1비트 '봉사이(Bonsai)' LLM을 공개했습니다. 이 모델은 4배 압축에도 표준 벤치마크 성능을 거의 유지하며, 시각·언어에 최적화된 20억 파라미터 모델로 착용자가 보는 것을 실시간으로 질문할 수 있게 합니다. 프리즘ML은 프라이버시와 막대한 컴퓨팅 수요 문제가 있는 폐쇄형 AI에 대한 대안으로 온디바이스 오픈 웨이트 AI를 지향하지만, 아직 이 모델을 탑재한 스마트 글래스는 발표되지 않았습니다.

초경량 모델 온디바이스 AI 스마트 글래스
TC
TechCrunch AI • 3일 전
IMP 7

퀄컴, AI 특화 스냅드래곤 8 엘리트 6세대 칩 2종 공개

퀄컴이 연례 스냅드래곤 서밋에서 AI 기능 강화에 초점을 맞춘 '스냅드래곤 8 엘리트 6세대'와 '8 엘리트 익스트림 6세대' 두 플래그십 프로세서를 발표했습니다. 익스트림 모델은 300억 파라미터 MoE 모델을 기기에서 온전히 구동할 수 있으며, 새로운 센싱 허브를 통해 개인 비서·음성 에이전트 등 온디바이스 AI 경험을 크게 확장한다는 점에서 주목됩니다.

퀄컴 스냅드래곤 온디바이스 AI
TC
TechCrunch AI • 8일 전
IMP 7

PrismML, 초소형 LLM으로 AI 사용 방식 바꾸려 한다

칼텍(Caltech) 연구진이 창업한 PrismML은 'Bonsai 2 27B'를 공개하며 알리바바 Qwen3.8 27B를 5.9GB로 압축, 원본 대비 98%의 벤치마크 성능을 유지하는 추론 모델을 PC와 스마트폰에서 구동 가능하게 만들었다. 3진(ternary) 가중치 기법으로 모델 크기를 9~10배 줄인 이 기술은 온디바이스 AI의 무료·프라이빗 실행을 가능하게 할 수 있어 업계 판도를 바꿀 잠재력이 있다.

압축 기술 온디바이스 AI 경량화
HN
Hacker News • 12일 전
IMP 8

와트당 지능: 로컬 AI의 지능 효율성 측정

스탠퍼드 등 연구진이 로컬 AI 추론의 성능과 전력 효율을 함께 측정하는 '와트당 지능(IPW)' 지표를 제안했습니다. 2023~2025년 분석 결과 로컬 모델의 IPW가 5.3배 향상되었으며, 실제 쿼리의 88.7%를 로컬 모델이 성공적으로 처리할 수 있는 것으로 나타났습니다. 로컬 가속기는 동일 모델 기준 클라우드보다 최소 1.4배 높은 전력 효율을 보여, 클라우드 중심 AI 인프라의 수요 분산 가능성을 제시합니다.

로컬 AI LLM 추론 전력 효율
HN
Hacker News • 16일 전
IMP 8

애플 M3 뉴럴 엔진에서 50 GB/s 되찾기

애플 M3 뉴럴 엔진(ANE)의 RTL 성능 에라타로 인해 가중치 크기가 1 MiB의 정수 배일 때 DRAM 처리량이 공칭 45-60 GB/s에서 17-19 GB/s로 급감한다. 이는 저수준 하드웨어 분석을 통해 발견되었으며, 커널 DMA 엔진의 문제 경로를 우회함으로써 Llama 3.2 1B의 토큰 처리량이 10.0에서 24.3 tokens/s로, Qwen3-8B가 1.36에서 2.97 tokens/s로 각각 2배 이상 향상되었다.

애플 실리콘 뉴럴 엔진 하드웨어 최적화
HN
Hacker News • 16일 전
IMP 7

데저트 앤트 랩스, 온디바이스에서 구동되는 초고속 로컬 AI 모델 공개

유럽의 AI 연구소 데저트 앤트 랩스(Desert Ant Labs)가 오디오·비전·텍스트용 소형 전문 모델 18종을 공개했습니다. 모든 모델은 기기에서 직접 실행되어 밀리초 단위로 응답하고 운영 비용이 없으며, 월 10만 대의 활성 기기까지 무료로 제공됩니다. 클라우드 API 비용과 프라이버시 문제를 해결하는 온디바이스 AI 접근법으로, 기존 클라우드 모델 대비 최대 10배 빠르고 에너지 소모도 크게 적습니다.

온디바이스 AI 소형 모델 로컬 추론
HN
Hacker News • 17일 전
IMP 5

LLM 어텐션(주의 메커니즘) 시각화 도구 공개

해커뉴스에 트랜스포머 기반 LLM의 어텐션 가중치를 시각화하는 웹 도구가 공개되었습니다. 생성된 토큰에 마우스를 올리면 어떤 이전 토큰이 생성에 영향을 미쳤는지 확인할 수 있어, LLM이 복사-붙여넣기에 강한 이유를 직관적으로 이해할 수 있습니다. Transformers.js를 활용해 브라우저에서 동작하며, ONNX 모델을 수정해 내부 어텐션 값을 노출시킨 것이 기술적 포인트입니다.

어텐션 시각화 트랜스포머 LLM 해석가능성
HN
Hacker News • 31일 전
IMP 6

쇼 HN: 라즈베리파이와 Qwen으로 만든 오프라인 차량용 AI

라즈베리파이 5(16GB, 약 300유로)에 Qwen3.6-35B 모델을 로컬로 구동해 차를 채팅룸 에이전트처럼 만드는 오픈소스 프로젝트입니다. 클라우드 없이 차량용 음성 비서, 745페이지 차량 매뉴얼 기반 RAG 질의응답, 자가진단, 블랙박스 영상 전송 등을 완전 오프라인으로 수행하며, 연결이 끊겨도 큐에 저장했다가 나중에 전송하는 견고한 설계가 돋보입니다.

라즈베리파이 온디바이스 AI Qwen
HN
Hacker News • 31일 전
IMP 8

애플, M6와 M5 울트라 칩 공개... 성능·AI 연산 대도약

애플이 최초의 2nm 칩인 M6를 신형 맥 미니에, 쿼드다이 구조의 최강 칩 M5 울트라를 신형 맥 스튜디오에 탑재해 공개했습니다. M6는 12코어 CPU/GPU와 듀얼 16코어 뉴럴 엔진으로 온디바이스 AI 성능을 크게 끌어올렸고, M5 울트라는 최대 36코어 CPU, 80코어 GPU, 1.2TB/s 통합 메모리 대역폭으로 대형 AI 모델 구동이 가능합니다.

애플 M6 M5 울트라
HN
Hacker News • 36일 전
IMP 6

1억 2,500만 파라미터 피아노 자동완성 온디바이스 모델 공개

한 개발자가 1억 2,500만 파라미터 트랜스포머를 학습시켜 피아노 연주를 실시간으로 자동완성하는 앱 'RollTab'을 무료 공개했습니다. iPhone 15에서 초당 약 108개의 노트를 생성하며, MIDI 표현 방식 최적화, 학습 데이터 정제, DPO 후속 학습이 성능 향상의 핵심이었다고 합니다. 온디바이스에서 실시간 음악 생성을 구현한 사례로 모바일 AI 응용에 참고할 만합니다.

온디바이스 AI 음악 생성 트랜스포머
HN
Hacker News • 46일 전
IMP 8

온디바이스 AI 'Needle2': 14MB 초소형 모델 공개

스마트폰, 웨어러블, 로봇 등 200달러 미만의 저사양 기기에서 초고속으로 구동되는 14MB 크기의 온디바이스 에이전트 AI 모델이 공개되었습니다. 모델 자체를 극도로 가볍게 설계하여 기기 제어와 데이터 추출에 특화되었으며, 클라우드 연결 없이도 완벽한 프라이버시와 즉각적인 응답을 제공하는 것이 핵심입니다.

온디바이스 AI 소형 언어 모델(SLM) 양자화(Quantization)
HN
Hacker News • 73일 전
IMP 9

스마트폰에서 구동되는 최초의 27B급 AI 모델 '분사이(Bonsai)'

PrismML이 1비트(1-bit) 및 3진법(ternary) 양자화 기술을 적용한 초경량 AI 모델 '분사이 27B(Bonsai 27B)'를 공개했습니다. 이 모델은 스마트폰이나 일반 노트북 환경에서도 270억 개 매개변수(27B) 수준의 고성능 추론, 코딩, 시각 및 에이전트 기능을 온디바이스로 실행할 수 있게 해주는 패러다임 전환적 의미를 지닙니다. 지능 손실은 최소화(기존 대비 90~95% 성능 유지)하면서도 메모리는 혁신적으로 절감하여, 강력한 오픈소스 AI의 모바일 활용을 본격화할 것으로 기대됩니다.

온디바이스 AI 초경량 모델 1비트 LLM
WR
Wired AI • 74일 전
IMP 8

애플 '시리 AI', 아이폰의 모든 것을 바꾸다

애플이 iOS 27 퍼블릭 베타를 통해 대대적으로 개편된 '시리 AI'를 전격 공개했습니다. 기존의 단순 음성 비서를 넘어 챗봇 형태의 UI를 갖추고 아이폰 운영체제(OS) 전체에 깊숙이 통합되어, 사용자가 기기 내 개인 데이터를 기반으로 훨씬 강력한 작업을 수행할 수 있게 되었습니다. ChatGPT나 Claude 같은 타사 챗봇이 가지지 못한 기기 내부 컨텍스트 접근성을 무기로 애플이 본격적인 온디바이스 AI 생태계 경쟁에 나선다는 점에서 중요합니다.

애플 시리 온디바이스 AI
MP
MarkTechPost • 90일 전
IMP 8

리퀴드 AI, 온디바이스 최적화 초소형 모델 공개

Liquid AI가 다양한 추론 프레임워크(llama.cpp, vLLM 등)를 지원하는 초소형 오픈웨이트 모델 LFM2.5-230M을 공개했습니다. 이 모델은 스마트폰과 라즈베리파이 같은 저사양 기기에서도 매우 빠른 속도로 구동되며, 파라미터 수가 더 많은 기존 모델들을 능가하는 성능을 보여줍니다. 향후 네트워크 연결 없이 구동되는 모바일 기기 및 엣지 디바이스의 AI 도구 활용 및 데이터 처리 능력을 크게 향상시킬 수 있다는 점에서 실무자들에게 중요한 의미를 갖습니다.

온디바이스 AI 소형 언어 모델 엣지 컴퓨팅
HN
Hacker News • 103일 전
IMP 8

클라우드 LLM 골드러시의 종말

애플이 WWDC에서 발표한 로컬 기반 AI 전략은 클라우드 LLM(대형 언어 모델)에 대한 맹목적인 의존이 끝나가고 있음을 시사합니다. LLM은 본질적으로 확률적 시스템이므로 정확성이 필수적인 자동화 인프라보다는 소프트웨어 개발, 학습, 번역 등 인간의 작업을 증폭시키는 도구로 활용하는 것이 실용적입니다. AI의 실질적인 가치는 단순히 AGI를 향한 기술적 경쟁이나 월간 구독 모델이 아니라, 온디바이스에서 작동하는 실용적이고 즉각적인 워크플로우 최적화에 있습니다.

로컬 AI LLM 온디바이스 AI
HN
Hacker News • 109일 전
IMP 8

애플, 시리 AI 공개: 개인화된 차세대 인공지능

애플이 사용자의 맥락을 이해하고 강력한 개인정보 보호 기능을 갖춘 차세대 개인 지능 플랫폼인 '시리 AI(Siri AI)'를 발표했습니다. 이번 업데이트를 통해 시리는 오픈엔디 질문에 답변하고, 사용자의 앱 내에서 직접 작업을 수행하며, 전용 앱을 통해 기기 간 대화를 이어갈 수 있게 되었습니다. 또한 아이폰뿐만 아니라 아이패드, 맥, 비전 프로 등 더 많은 기기에서 시각적 지능(Visual Intelligence)을 활용하여 화면 및 주변 사물을 인식하고 즉각적인 조치를 취할 수 있게 된 것이 핵심입니다.

애플 인텔리전스 시리 AI 시각적 지능
HN
Hacker News • 113일 전
IMP 9

트랜스포머 QKV 투영 생략 연구

트랜스포머 모델의 핵심인 어텐션(Attention)에서 반드시 필요한 Query, Key, Value(QKV) 세 개의 투영(Projection)을 공유하거나 생략해도 모델 성능을 유지할 수 있다는 연구 결과입니다. 특히 Key와 Value를 하나로 합치는 방식은 추론 시 메모리 캐시를 최대 96.9%까지 획기적으로 줄이면서도 언어 모델의 성능 저하를 최소화하여, 스마트폰 등 엣지(Edge) 기기에서의 AI 추론 활용을 크게 앞당길 수 있는 실용적인 기여를 합니다.

트랜스포머 최적화 메모리 최적화 온디바이스 AI
MP
MarkTechPost • 114일 전
IMP 8

온디바이스 개인 AI 에이전트, 오픈자비스(OpenJarvis) 공개

스탠퍼드 연구진이 추론, 에이전트, 메모리, 학습 기능을 기기 내부에서 온전히 실행하는 오픈소스 프레임워크 '오픈자비스(OpenJarvis)'를 공개했습니다. 이 프레임워크는 개인 AI 시스템을 다섯 가지 구성 요소로 분리하여 모듈형으로 제공하며, 최고 수준의 클라우드 모델과 비슷한 성능을 내면서도 API 비용은 약 800분의 1 수준으로 크게 절감합니다. 민감한 개인 데이터를 외부로 전송하지 않고도 고성능 AI를 로컬 환경에서 구동할 수 있다는 점에서 실무적인 의의가 큽니다.

오픈자비스 온디바이스 AI 개인 정보 보호
TD
The Decoder • 114일 전
IMP 7

퍼플렉시티, 로컬과 클라우드 자동 판독 하이브리드 AI 공개

퍼플렉시티(Perplexity)가 사용자 기기에서 구동되는 로컬 AI 모델과 강력한 클라우드 모델을 결합하여, 작업 성격에 따라 처리 위치를 자동으로 결정하는 하이브리드 추론 시스템을 발표했습니다. 민감한 개인정보는 로컬에서 안전하게 처리하고 복잡한 연산이 필요한 작업은 클라우드로 분산시켜 정확성, 프라이버시, 에너지 효율성을 동시에 최적화하는 것이 이번 시스템의 핵심입니다.

퍼플렉시티 하이브리드 AI 온디바이스 AI
HN
Hacker News • 117일 전
IMP 9

로컬 기기용 초경량 이미지 생성 모델

PrismML이 노트북과 스마트폰 같은 로컬 기기에서 고품질 이미지 생성을 가능하게 하는 40억 파라미터(4B) 모델 'Bonsai Image 4B'를 공개했습니다. 이 모델은 가중치를 1비트(1-bit) 또는 삼진법(Ternary) 형태로 압축하여, 기존 풀 정밀도(FP16) 모델 대비 메모리 사용량을 약 6~8배 획기적으로 줄였습니다. 특히 이 파라미터 클래스의 이미지 모델 중 최초로 아이폰에서 직접 구동될 수 있어, 온디바이스 AI 생성 기술의 새로운 지평을 열었다는 데 큰 의미가 있습니다.

온디바이스 AI 이미지 생성 모델 경량화
MP
MarkTechPost • 120일 전
IMP 6

리퀴드 AI, 128K 컨텍스트 지원 온디바이스 MoE 모델 공개

리퀴드 AI는 일반 소비자용 하드웨어에서도 구동 가능한 온디바이스용 MoE 모델인 LFM2.5-8B-A1B를 발표했습니다. 이 모델은 총 83억 개(8.3B)의 파라미터를 보유하고 있으면서도 연산 시 15억 개(1.5B)만 활성화하여 효율적인 추론을 자랑합니다. 최대 12만 8천(128K) 토큰의 긴 컨텍스트 처리와 고급 추론, 그리고 도구 호출(Tool calling) 기능을 지원하는 것이 특징입니다.

온디바이스 AI MoE 리퀴드 AI
TD
The Decoder • 120일 전
IMP 7

구글, Gemma 3 온디바이스 구동 초소형 보드 공개

구글이 자체 NPU를 탑재해 AI 모델을 네트워크 없이 로컬에서 구동할 수 있는 초소형 싱글보드 컴퓨터 'Coral Board'를 공개했습니다. 이 보드는 이어폰, 스마트워치 등 초소형 기기에 적합하며 AI 가속기 파편화 문제를 해결하는 것을 목표로 합니다. 완전한 오프라인 환경에서 실시간 번역 등 다양한 엣지 AI 데모를 성공적으로 선보였다는 점에서 실무자들에게 큰 의미를 갖습니다.

온디바이스 AI 구글 코랄 Coral Board
TC
TechCrunch AI • 128일 전
IMP 7

앤드루 응 투자, PC의 든든한 AI 업무 자동화 친구 '아이리스고'

전 애플 엔지니어가 창업한 AI 스타트업 아이리스고(IrisGo)는 사용자의 데스크톱 업무 흐름을 학습하여 반복 작업을 사전에 자동화해 주는 '자율형 AI 에이전트'를 개발했습니다. 최대 280만 달러(약 37억 원)의 시드 투자를 유치하며 엔비디아, 구글 등 빅테크의 지원을 받았고, 에이서(Acer)와 같은 PC 제조사들에 앱을 기본 탑재하는 등 본격적인 시장 공략에 나서고 있습니다.

AI 에이전트 업무 자동화 앤드루 응
TD
The Decoder • 132일 전
IMP 8

오포, 스마트폰 센서 활용 안드로이드 AI 에이전트 오픈소스화

오포(Oppo)의 Multi-X 팀이 카메라, 화면, 음성 등 스마트폰의 모든 센서를 활용해 앱 간 작업을 수행하는 오픈소스 안드로이드 AI 에이전트 'X-OmniClaw'를 공개했습니다. 이 에이전트는 가상화된 클라우드 환경이 아닌 기기 자체에서 직접 구동되어 민감한 개인 정보를 보호하고, 사용자의 행동을 클론하여 자동화하는 것이 특징입니다. 이는 개인정보 보호를 강화한 온디바이스 기반 모바일 AI 에이전트의 발전 방향을 제시한다는 점에서 중요합니다.

안드로이드 온디바이스 AI AI 에이전트
LL
r/LocalLLaMA • 133일 전
IMP 6

네트워크 없이 구동되는 오프라인 로봇, 젯슨 오린과 젬마 3 탑재

Reddit 사용자가 Wi-Fi나 셀룰러 연결 없이 엔비디아 젯슨 오린 NX와 소형 언어 모델인 Gemma 3 4B만으로 완전한 오프라인 로봇을 제작했습니다. 프롬프트 구조 최적화를 통해 캐시 적용 시 첫 토큰 생성 시간(TTFT)을 약 200ms로 단축하고 30개 이상의 센서 데이터를 실시간으로 자연어로 처리하는 점이 기술적으로 주목받습니다.

오픈소스 모델 온디바이스 AI 로봇 공학
HN
Hacker News • 138일 전
IMP 7

M4(24GB)에서 구동되는 로컬 AI 모델 최적화기

이 글은 24GB 메모리를 탑재한 M4 맥북 프로에서 인터넷 없이 로컬 AI 모델을 구동하고 코딩 등의 작업에 활용하는 방법을 다루고 있습니다. 실험 끝에 Qwen 3.5-9B 모델을 발견했으며, SOTA(최고 수준) 모델에는 미치지 못하지만 기본적인 연구, 계획, 그리고 도구 활용이 가능해 유용합니다. 또한 Ollama, LM Studio 등의 환경 설정과 Pi, OpenCode 등 터미널 클라이언트의 구성 방법 및 추천 파라미터까지 상세히 공유하고 있습니다.

로컬 AI 오픈소스 모델 M4 맥북
HN
Hacker News • 138일 전
IMP 8

온디바이스 로컬 AI가 표준이 되어야 하는 이유

최근 소프트웨어 개발에서 단순히 클라우드 기반 AI API를 호출하는 방식은 앱의 안정성을 떨어뜨리고 개인정보 침해 우려를 키웁니다. 이에 개발자는 성능이 충분한 로컬 기기의 내장 AI 모델을 활용해 온디바이스에서 직접 기능을 수행해야 한다고 강조합니다. Apple 생태계를 예시로 든 이 글은, 구현 가능한 경우 로컬 AI를 우선 채택하는 것이 개발자와 사용자 모두에게 현명한 접근임을 시사합니다.

온디바이스 AI 로컬 AI 개인정보 보호
HN
Hacker News • 138일 전
IMP 6

크롬 AI 기능이 내 PC 저장공간 4GB 잡아먹는 이유

구글 크롬의 내장 AI 기능을 활성화하면 기기 내 로컬 환경에서 구동되는 '제미나이 나노(Gemini Nano)' 모델 파일(약 4GB)이 사용자 동의나 명확한 안내 없이 자동으로 다운로드됩니다. 저장 공간이 부족한 사용자는 크롬 설정에서 '기기 내 AI' 옵션을 꺼야만 해당 파일을 삭제하고 공간을 확보할 수 있습니다.

구글 크롬 제미나이 나노 저장 공간
WR
Wired AI • 141일 전
IMP 6

크롬에 숨어있는 구글 제미나이 비활성화 방법

구글이 크롬 브라우저에 경량 AI 모델인 '제미나이 나노(Gemini Nano)'를 기본 탑재하면서, 사용자 동의 없이 약 4GB의 저장 공간이 자동 할당되어 프라이버시 논란이 일고 있습니다. 사용자는 크롬 설정의 '시스템' 메뉴에서 '기기 내 AI(On-device AI)'를 끄는 방식으로 해당 모델을 쉽게 삭제할 수 있습니다. 단, 모델을 비활성화하면 기기 내부에서 처리되는 AI 기반 피싱 및 사기 탐지 등의 보안 기능이 더 이상 작동하지 않는다는 점에 유의해야 합니다.

크롬 제미나이 나노 프라이버시
HN
Hacker News • 141일 전
IMP 8

크롬, '기기 내 AI 데이터 구글 전송 안 함' 문구 삭제

구글 크롬의 최신 업데이트(v148)에서 기기 내 AI(On-device AI)가 사용자 데이터를 구글 서버로 전송하지 않는다는 명시적인 프라이버시 보장 문구가 삭제되었습니다. 이는 사용자의 기기를 활용해 AI를 구동하는 동시에 자원을 절약하고 데이터를 수집하려는 구글의 의도로 해석됩니다. 해당 사안을 계기로 많은 사용자들이 파이어폭스나 브레이브 등 대체 브라우저로 이동을 고려하는 등 개인정보 보호에 대한 우려가 커지고 있습니다.

크롬 온디바이스 AI 개인정보 보호